Ve více vzorcích se zobrazuje tento symbol:

∑: Suma (součet). Tento symbol značí, že máme sečíst hodnoty pro všechny hodnoty (od 𝑖=1i=1 do 𝑖=𝑛i=n).

Pro lepší pochopení následující látky je dobré si připomenout co to je Normální rozdělení a Centrální limitní věta.

Statistika 7. hodina Normální Rozdělení

Centrální limitní větu

ta říká, že když máme velký počet pozorování,
tak jejich součet se chová jako náhodná veličina s normálním rozdělením.

Vlastnosti a aplikace normálního rozdělení tedy můžeme často použít i na
součty mnoha pozorování.

Později uvidíme, že toto je velice důležitý znát při výběru testů a modelů a jejich předpokladů.

Členění statistiky a testování hypotéz

Než se pustíme více do metod výzkumu připomene si dva druhy statistiky

Popisná (deskriptivní)

Induktivní (inferenční, testovací)

Testování hypotéz

Formální postup

Chyby usuzování

[^Statistics for people who think they hate statistics 7th edition]

Buňka 2, ukazuje chybu I. typu. Zde jsme zamítli nulovou hypotézu,
(že neexistuje žádný rozdíl), i když je ve skutečnosti pravdivá (a rozdíl existuje).

Další typ chyby II. typu je v buňce 3. Zde jsme přijali nulovou hypotézu (že neexistuje žádný rozdíl). I když je ve skutečnosti nepravdivá (a ve skutečnosti rozdíl mezi skupinami existuje).

Statistické testy

Umožňují odvodit z výsledků ve výběrech
(optimálně náhodných), závěry týkající se
základního souboru.

Vzorečky na metody

Jak vybrat správný test

Časté možnosti využití, když je třeba porovnáváme :

Statistické testy jsou založeny na výpočtech testové statistiky, která mají známé teoretické rozdělení (normální, t-rozdělení, F, x2, U …)

Lze určit, jakou hodnotu má testová statistika, pokud platí H0 (výsledek je v rámci platnosti nulové hypotézy).

Podle výsledku testu (a stupňům volnosti, d.f., s.v. – určují se z počtu nezávislých pozorování) se stanoví, jestli pozorované odchylky ve výsledcích jsou jen dílem náhody nebo se jedná o signifikantní (tj. statisticky významné) výsledky.

Jako výsledek statistického testu lze uvést:

hodnotu testové statistiky, testovacího kritéria (např. t, F, χ 2, U…..)

Příklady použití testů

testuji, zda můj výběr má střední hodnotu shodnou s danou hodnotou populace – jednovýběrový t-test
(H : μ = průměr hodnot x výběru)

dlouhodobá průměrná denní teplota v červnu je μ= 17.5 °C. Byla letos stejná nebo se lišila signifikantně?

testuji, zda dva náhodné výběry (nezávislé) pochází ze stejného základního souboru (mají stejnou střední hodnotu) – dvouvýběrový t-test (H : μ = μ )

Výkony žen a mužů v testu

testuji, zda rozdíl párových hodnot (závislých) je roven dané hodnotě (většinou 0) - párový t-test (H : μ - μ =0)

výkon v testu ráno a večer u stejné skupiny osob.

Parametrické vs Neparamatrické testy

Parametrické testy

Výpočet je založen na využití parametrů (průměr,
rozptyl, směrodatná odchylka).

Všechny zmíněné testy v tomto souboru jsou parametrické

Předpoklady použití:

metrická stupnice (intervalová, poměrová)

Neparametrické testy

• Výpočet je založen zejména na mediánech a
pořadí. Nevyužívají se parametry.

Neparametrické testy

Použití neparametrických testů:

• Rozdělení dat odlišné od normálního.
• Malé výběry (cca do 30).
• Nemetrický charakter proměnných (pořadové,
nominální) nebo i metrické (kardinální)
proměnné s asymetrickým rozložením (tj. odlišné od normálního).

Příklady alternativ

Příklad

chci prokázat: žáci z gymnázia A mají lepší znalosti než z gymnázia B

formuluji hypotézu: H0 : Zjištěné znalosti ve výběrech žáků obou 0
gymnázií pochází z jednoho základního souboru (úroveň znalostí se neliší)

alternativní hypotéza: Ha : Výběry zjištěných znalostí žáků z A
gymnázií A a B nepochází z jednoho základního souboru (=
úroveň znalostí se liší)

provedu testování, do jaké míry je pravděpodobné, že oba výběry pochází ze stejného základního souboru

pokud je pravděpodobnost příslušná zjištění malá (p < 0.05), zamítnu H0 a akceptuji Ha

pokud je p > 0.05, nemůžu zamítnout H0

Zamítnutí nulové hypotézy zároveň značí, že mezi skupinami je ve znalostech statisticky významný rozdíl (signifikantní).

Dvou výběrový t-test - postup

T-testy používáme, když neznáme populační směrodatnou odchylku a z-test když ano.

rovnají se rozptyly?

shodnost rozptylů testuji F-testem
(H : s2 = s2 )

Počítáme jako poměr většino rozptylu k menšímu rozptylu

F=s12s22

Kritické hodnoty se určují z F-rozdělení pro zvolenou hladinu významnosti (např. 0.05 pro 95% interval spolehlivosti) a pro odpovídající stupně volnosti, které jsou df1=n1−1 a df2=n2−1

Hodnotu hledáme ručně v tabulkách, pokud počítáme ručně.

pokud p větší než 0.05 – nemůžu zamítnout H0 → rozptyly se rovnají (to je většinou)

pokud p menší než 0.05 – můžu zamítnout H0→ rozptyly se nerovnají

Dvouvýběrový t-test (Studentův test = t-test)

Testovací kritérium t - pro s 2 ~ s 2:

t=|x―1−x―2|n1s12+n2s22⋅n1n2(n1+n2−2)n1+n2

Testovací kritérium t - pro s 2 > s 2:

t=|x1−x2|s12n1−1+s22n2−1

(Počet stupňů volnosti: df = n - 1, df = n – 1).

Grafické vyjádření

pro znázornění t-testu je vhodný krabicový graf
Krabicový graf

T-test pro párované hodnoty (parametrický)

Testovací kritérium: t=|d¯|.n−1Sd

kde |¯d| je absolutní hodnota průměrné diference párovaných hodnot a s je směrodatná odchylka této diference. Počítá se jako běžně směrodatná odchylka, tj.:

sd=∑d2−(∑d)2nn−1
Proč n-1?

Jelikož děláme příklad z dat, která nejsou sterjná jako data z celkové populace, poze odhadujeme. Pro případy kdy by byli reálné výsledky populace slabší, je lepší nadhodnocovat výsledky testových statistik

Poté je třeba porovnat hodnotu testové statistiky t s hodnotou t-rozdělení, která náleží p=0,05 a df=9. Pokud je t vyšší, pak je signifikantní výsledek.
(Toto se uplatňuje při ručním počítání.) A používají se na to tabulky.

T-test pro nezávislé výběry

(výstup z PSPP)

Pro vyhodnocení se koukáme na sloupečky F (čím vyšší, tím lepší), t (t-statistika), df (stupně volnosti), Sig. (2-tailed) p hodnota.

Takže by nás mohlo zajímat celková Signifikance, 5. řáded. Jenom první dvě jsou pod hodnotou 0,05.

T-test pro závislé výběry

(výstup z PSPP)

Koukáme na poslední řádek, ten se rovná 0,47, což je větší než 0,05.

Testy shody

Parametrický test – Chí kvadrát test (χ2)

·       Podmínky: žádná kategorie s nulovou četností; maximálně 20 % s četností menší než 5

Testovací kritérium

χ2=∑i=1n(Ai−Ei)2Ei

ANOVA

ANOVA, Více faktorová ANOVA

NÁZEV: Analýza rozptylu

CÍL: hledat rozdíly v průměrech několika skupin(nechceme porovnávat kontrolní a testovací skupinu, ale třeba kontrolní, druhá bude v posteli, třetí na zemi, čtvrtá na vodní posteli, pátá …)

Anglicky ANOVA – ANalysis Of VAriance

Linerání regresní analýza

Lineární regresní analýza

Výsledkem je model vztahu mezi dvěma a více proměnnými
přesněji než korelace popisuje poodbu zvathu mezi proměnnámi